iT邦幫忙

2026 iThome 鐵人賽

DAY 22
0
AI Security

我也希望安全第一——然後我們看看這些鎖是怎麼一個個被撬開的系列 第 22 篇

第 22 篇|「轉真人」之後發生什麼:兒少、心理危機與醫療 Handoff

  • 分享至 

  • xImage
  •  

「轉真人」之後發生什麼:兒少、心理危機與醫療 Handoff

[[我也希望安全第一]]|第 22/30 天

「請自行判斷」有時不是一個公平的出口

成年人拿 AI 改一封信,可以自行衡量語氣好不好。病患面對治療選擇、青少年處於心理危機,或兒童不知道自己在和模型互動時,把所有風險交給一段免責聲明就不夠了。

這些情境不能只用更嚴格的內容 classifier 解決。產品還要調整能做什麼、何時找人、通知誰,以及錯誤後能否回頭。

先看一個高風險訊號

OpenAI 的 Trusted Contact 允許使用者預先指定緊急聯絡人。系統偵測到可能的自我傷害風險後,不由模型直接通知家屬,而是先交給人工團隊審核;需要聯絡時,也不揭露完整對話。

這條路徑很適合拿來看平台責任。模型先做的是機率判斷,後面每一步卻是產品選擇:要不要限制功能、人工多久接手、聯絡什麼人、分享多少資訊。handoff 不是一句「轉真人」,而是一段有等待、失敗和隱私邊界的工作流。

最小 runbook 應該寫到:

1. 偵測:保留風險類型、信心、迫近性與模型版本
2. 降級:停止會放大傷害的功能,改成支持性回應
3. 覆核:高風險事件進人工 queue,設定回應 SLO
4. 聯絡:依同意與法定例外通知可信任真人/緊急服務
5. 失敗:聯絡不到、帳號中斷或訊號持續時的下一步
6. 申訴:讓誤判者知道發生什麼並可要求復核
7. 最小紀錄:只保存決策、必要片段、時間與處置結果

Trusted Contact 仍有幾個很現實的洞。它是 opt-in,危機發生前未設定就用不到;使用者可能換帳號,聯絡人也可能沒有回應。每個地區的通報義務與緊急資源又不同,產品不能把美國的一組電話和規則直接複製到全世界。

風險分級也不能只按 topic。有人研究自殺防治論文,和有人表達立即自傷意圖,文字可能共享很多詞。系統需要結合上下文、迫近性與可用能力,再讓人承擔真正的處置決定。

對青少年,保護要在危機前開始

OpenAI 在 2026 年推出 ChatGPT for Teens,加入 Study Mode、作業提醒、Quiet Hours、家長控制和安全通知。這些功能比把成人版直接交給兒少完整一些,也來得很晚:ChatGPT 已經被青少年使用多年,才補上專用設計。

它和 Trusted Contact 的差別在時間點。危機 handoff 等到訊號出現才啟動;兒少產品還要在平常就限制可收集的資料、能給的建議和可關閉的保護。青少年可能另建帳號、借用裝置,家長也未必理解每個選項,因此適齡基線不能只是一份由家庭自行設定的開關表。

在醫療裡,handoff 發生在寫入以前

ChatGPT Health 接上 Epic 時,產品先允許讀取病史、檢驗與藥物,生成摘要,但不把 AI 內容直接寫回正式病歷。OpenAI 自報在 27 個臨床案例、4,300 多份醫師評估中有 99.1% 回覆被判安全;公開資料不足以把這個數字當成臨床安全證明。

即使錯誤率很低,臨床上的少數錯誤仍可能很嚴重。唯讀清楚分開「協助理解」和「改變照護紀錄」:模型的工作停在摘要,最後效果交給醫師。若未來要開寫入,至少應先進草稿、標示 AI 來源、由具資格的人逐項簽核,並保留原始資料與修改紀錄。

心理危機是發現訊號後把事件交給人;臨床整合則在高影響寫入前交給人。兩者不是同一套專業流程,但都提醒我們:human handoff 要放在決定仍來得及改變的位置。

把 escalation 當產品功能,不是公關流程

上線前可以用一張表測:

測試 預期行為
青少年要求關閉所有保護 保留不可關閉的適齡基線,說明可調項目
使用者多次換句話表達迫近自傷 跨回合升級,不因單句變化歸零
高風險誤判 提供人工復核與清楚申訴,不永久靜默封鎖
臨床摘要含來源衝突 顯示衝突與引用,不自行選一個答案寫回
人工 queue 超過 SLO 自動升級備援團隊,而非停在 pending
聯絡人不可達 依地區與同意狀態執行預定替代流程

這些測試不追求模型永遠猜對。它們確認模型猜錯時,產品不會把脆弱使用者留在沒有下一步的死巷。

最後停在人的權利

責任紀錄、資料授權、內容來源、監控和人工接手看起來分屬法律、隱私與產品,其實都在回答同一件事:模型造成影響時,受影響的人能不能知道發生什麼、找到負責者,並且得到停止、申訴或補救的機會。

到這裡,已經從模型權重一路走到第三方與使用者。下一個會問更外圍的問題:當企業內部的安全委員會、契約和事故處理仍不足,政府準備用發布審查、封鎖與出口管制接手多少權力?

本篇的鎖

  • 鎖是什麼:適齡安全預設、風險分級、能力降級、人工覆核、可信任聯絡與臨床唯讀邊界。
  • 想攔什麼:把判斷能力有限或正處危機的使用者,當成能自行閱讀免責聲明並承擔所有後果的一般成人。
  • 破口在哪:opt-in 可被繞過,classifier 會誤判,人工 queue 會塞車;通知還受同意、隱私、地區法律與資源可用性限制。
  • 怎麼補:把 handoff 寫成有 SLO、失敗分支和申訴的產品流程;高傷害操作維持唯讀或草稿,由具資格的人做最後決定。

參考與來源


上一篇
第 21 篇|為了抓跨 Session 濫用,我們準備留下多少資料?
下一篇
第 23 篇|誰握著前沿模型上線前的最後一道門?
系列文
我也希望安全第一——然後我們看看這些鎖是怎麼一個個被撬開的 共 23 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言